00 - 专题索引
转载说明
本专题全文转载自开源文档站 AI Infra 学习笔记,作者 程治玮(Se7en / cr7258),仅作个人学习存档,正文与配图保持原样。
- 原文站点:https://se7en.mintlify.app/talks
- 源仓库:https://github.com/ai-infra-learning/docs (MIT License)
- 分享录屏:作者在 Bilibili 同步发布,各篇文内保留了原始播放器嵌入
这个专题讲什么
七期在线分享,沿着**「跑起来 → 看懂内存 → 看懂缓存 → 看懂解码 → 看懂调度 → 看懂架构 → 看懂平台」**的顺序,把 LLM 推理系统从单机部署一路拆到生产级推理平台。
| 期次 | 主题 | 解决的核心问题 | 关键概念 |
|---|---|---|---|
| 01 | vLLM 快速入门 | 怎么把 vLLM 跑起来 | 离线推理 vs 在线推理、GPU/CPU 后端 |
| 02 | PagedAttention | KV Cache 内存碎片 | 分页、Block Table、Copy-on-Write |
| 03 | Prefix Caching | 重复前缀的重复计算 | RadixAttention、Hash 复用、缓存感知路由 |
| 04 | Speculative Decoding | 自回归解码的串行瓶颈 | 草稿模型、Medusa、EAGLE、Lookahead |
| 05 | Chunked Prefill | Prefill 抢占 Decode | 分块预填充、Batching 演进 |
| 06 | PD 分离 | 两阶段互相干扰 | Goodput、KV Cache 传输、DistServe/Mooncake |
| 07 | 开源推理平台全景 | 集群级编排与调度 | Dynamo、llm-d、Kthena、OME、AiBrix、KServe |
推荐阅读顺序
- 只想部署模型:读 01,再按需查 07 里的平台选型。
- 准备 AI Infra 面试:02 / 03 / 05 / 06 是高频考点,建议配合核心论文清单一起看。
- 要做推理优化:02 → 05 → 06 是一条完整的「显存 → 调度 → 架构」主线。
与本站其他内容的关系
- LLM 开源框架推理部署:同一作者的 vLLM 部署教程,与本专题 01 同源。
- AI Infra 学习资源导航:论文、课程、书籍、开源项目的索引。
- mini-ray 项目沉淀:自己动手实现调度器与共享内存对象存储。